Adaptive Multimodal Fusion in Radiology: Dynamic Balancing of Visual Findings and Clinical Context
Dieses Paper schlägt eine Neural Gated Fusion-Architektur vor, die visuelle Thorax-Röntgenbilddaten und klinischen Text mittels einer adaptierten Gated Multimodal Unit dynamisch ausbalanciert und im Vergleich zu statischen Fusions- und unimodalen Ansätzen auf einem klinisch diversen MIMIC-CXR-Subset eine überlegene Leistung bei der Detektion von Thoraxpathologien – insbesondere solchen mit subtiler visueller Evidenz – demonstriert.